به گزارش حیات به نقل از فارس، پانگرام، سامانه پیشرفته تشخیص متون تولیدشده با هوش مصنوعی، در تابستان ۲۰۲۶ نسل چهارم تشخیص متن خود را عرضه کرد و چند هفته بعد، دانشگاه دارتموث اجازه استفاده استادان از همین ابزار را صادر کرد؛ اما پس از چندی استفاده از این سامانه توسط اساتید و ناظران علمی دانشگاه، برخی نوشتههای علمی معاون دانشگاه نیز با همان سامانه ماشینی اعلام شد!
پانگرام حالا برای معلمان و استادان طراحی شده است
پانگرام در ۲۹ ژوئیه ۲۰۲۶ نسل چهارم خود را معرفی کرد و از جذب ۹ میلیون دلار سرمایه خبر داد. نکته جالب توجه درباره این نسخه این است که میان متن کاملاً ماشینی، متن انسانی و متنهای ترکیبی تمایز میگذارد. همچنین این سامانه برای آموزش با کَنوَس، مودل، گوگل کلاسروم، برایتاسپیس و بلکبورد یکپارچه میشود و شرکت میگوید در بیش از ۲۰ زبان کار میکند و مدلهای چتجیپیتی، کلاود، جمینای و لاما را پوشش میدهد.ویژگی منحصر بفرد ادعایی این نسخه نیز محل بحث و گفت و گو قرار گرفته است. پانگرام میگوید این مدل با حدود ۲۸ میلیون سند انسانی آموزش دیده و برای هر متن، نمونه ماشینی همموضوع میسازد تا ویژگیهای نوشتار مدلهای زبانی را از سبک انسانی جدا کند.
پژوهش دانشگاه شیکاگو دقت پانگرام را بالا نشان داد
ارزیابی دانشگاه شیکاگو در اکتبر ۲۰۲۵، چهار آشکارساز پانگرام، اوریجینالیتی، جیپیتیزیرو و رُوبِرتا را روی هزار و ۹۹۲ متن در شش گونه خبری، وبلاگی، نقد مصرفکننده، رمان، نقد رستوران و رزومه بررسی کرد که در آن متنهای انسانی با خروجی چهار مدل جیپیتی ۴.۱، کلاود اوپوس ۴، کلاود سونت ۴ و جمینای ۲ فلش مقایسه شدند. در نتیجه این آزمایش، پانگرام در متنهای متوسط و بلند، نرخ مثبت کاذب و منفی کاذب تقریباً صفر داشت؛ در مقابل، رُوبِرتای منبعباز در برخی شرایط ۳۰ تا ۷۸ درصد از متنهای انسانی را اشتباه ماشینی تشخیص داد. لازم به ذکر است این پژوهش هزینه پانگرام را حدود نصف اوریجینالیتی و نزدیک به یکسوم جیپیتیزیرو برآورد کرده است.همچنین یک پژوهش منتشرشده دیگر در ژوئن ۲۰۲۶، چهار ابزار جیپیتیزیرو، پانگرام، کپیلیکس و ترنیتین را روی ۱۶۰ مقاله آزمایش کرد که شامل: ۴۰ متن انسانی، ۴۰ متن کاملاً ماشینی، ۴۰ متن ترکیبی و ۴۰ متن ماشینی بازنویسیشده برای شبیه شدن به نوشته انسان بود. در نتیجه این مقایسه نیز پانگرام به دقت سختگیرانه ۶۵ درصد و دقت فراگیر ۹۷.۵ درصد رسید و در دو گروه ترکیبی و انسانسازیشده نیز هرکدام ۳۷ مورد از ۴۰ متن را درست شناسایی کرد؛ یعنی دقت سختگیرانه ۹۲.۵ و فراگیر ۹۵ درصد. با این حال، همان مطالعه تأکید کرد که ابزار باید «آغاز بررسی» باشد، نه حکم نهایی.
دارتموث استفاده از پانگرام را رسماً مجاز کرد
در ۲۹ سپتامبر ۲۰۲۶، جان کری، رئیس موقت هیئت علمی هنر و علوم دارتموث، دستورالعمل هفتبندی تشخیص هوش مصنوعی در آموزش را برای استادان فرستاد که متن آن دیروز یعنی اول اکتبر منتشر شد.طبق مقررات جدید، استادان اجازه دارند آثار دانشجویان را به آشکارسازها بدهند، اما تنها پانگرام برای این مهم «مجاز» است، چون قابلاعتمادترین گزینه موجود دانسته شده است.همچنین طبق ادعاها استفاده از ابزار اجباری نیست و طبق مقررات استاد باید سیاست درس و اثر احتمالی نتیجه بر نمره را پیشاپیش اعلام کند و اثر دانشجو نیز پیش از بارگذاری از اطلاعات هویتی و خصوصی حذف شود. نتیجه ابزار هم بهتنهایی نباید مبنای تنبیه یا تغییر نمره باشد و کمیته استانداردهای دانشگاه باید مجموعهای از شواهد را بررسی کند.
خود دارتموث همزمان درگیر یک آزمون واقعی شد
اتفاق مهمتر اینجاست که دارتموث تنها چند روز پیش از اعلام این دستورالعمل، خود درگیر پروندهای شد که دقیقاً پرسش اعتبار این ابزارها را به سطح مدیریت دانشگاه کشاند.روز ۲۱ سپتامبر، روزنامه دانشجویی «دارتموث» اعلام کرد ۹ نوشتهای را که معاون دانشگاه، سانتیاگو شنل، در سال ۲۰۲۶ بهتنهایی منتشر کرده بود با پانگرام بررسی کرده و میانه درصد «نوشتهشده با هوش مصنوعی» در آنها ۹۶ درصد بوده است. جالبتر اینکه نوشتههای مستقل او که پیش از عرضه عمومی چتجیپیتی در سال ۲۰۲۲ منتشر شده بودند، از سوی پانگرام ۱۰۰ درصد انسانی تشخیص داده شدند.اما ماجرا زمانی پیچیدهتر شد که یکی از این نوشتهها همان مقالهای بود که شنل در ۹ اوت در واشنگتنپست درباره مقابله دانشگاهها با تقلب هوش مصنوعی منتشر کرده بود.سمافور در ۲۶ اوت این مقاله را ۱۰۰ درصد «تولیدشده با هوش مصنوعی» اعلام کرد. با وجود این شنل در توضیح خود گفت ایدهها و استدلالها از خودش بوده و از چتجیپیتی برای پالایش چند استدلال، اصلاح خطاهای دستوری و آمادهسازی مقاله استفاده کرده و متن همچنین چند مرحله ویرایش انسانی در واشنگتنپست را پشت سر گذاشته است. بنابراین نتیجه «۱۰۰ درصد» در اینجا بهسادگی قابل ترجمه به «صد درصد کلمهها را ماشین نوشته است» نیست چرا که خود سازوکار پانگرام میان تولید کامل، کمک هوش مصنوعی و متن ترکیبی تفاوت میگذارد.
جالبتر اینکه پانگرام حتی متن توضیح خود شنل را هم ماشینی دید
اما این تناقض در ادامه شدیدتر شد. شنل در پاسخ به گزارشها توضیح داد که هوش مصنوعی را «ابزار کمکی» میداند، خودش پژوهش و ارزیابی شواهد را انجام میدهد و مسئولیت متن نهایی را میپذیرد. اما روزنامه دارتموث اعلام کرد همان بیانیه شنل نیز در آزمون پانگرام ۱۰۰ درصد «نوشتهشده با هوش مصنوعی» علامت خورد!این نتیجه بهتنهایی ثابت نمیکند که بیانیه سراسر ماشینی بوده، زیرا استفاده اعلامشده از هوش مصنوعی در فرایند نوشتن وجود داشته است؛ در عوض، مسئله اصلی را روشن میکند: تشخیص «ردپای استفاده از هوش مصنوعی» با اثبات «اینکه چه کسی متن را نوشته» یکسان نیست.شنل در یکی از نوشتههای دانشگاهی خود حتی درباره همین مسئله پژوهش کرده است. مقاله او با عنوان «چه کسی این را نوشته است؟ تورینگ، تغییرات کلی و ریاضیات تشخیص متن هوش مصنوعی» استدلال میکند که یک متن نهایی بهتنهایی فقط بخشی از تاریخچه تولید خود را آشکار میکند و میان تشخیصپذیری آماری، تعیین منشأ متن، احراز اصالت و سنجش رعایت مقررات تفاوت وجود دارد. او همچنین توضیح میدهد که وقتی انسان و نرمافزار هر دو در تولید یک متن سهم دارند، برچسب دودویی «انسان» یا «ماشین» بخشی از واقعیت فرایند تولید را از دست میدهد که خود این مقاله نیز بهدلیل نقش هوش مصنوعی در فرایند تولید، به بخش دیگری از پرونده بدل شد.
دانشگاه پس از این پرونده بررسی رسمی را آغاز کرد
در ۲۵ سپتامبر، سیان بیلوک، رئیس دارتموث، اعلام کرد کمیتهای برای یک بررسی «دقیق و عینی» درباره استفاده سانتیاگو شنل از هوش مصنوعی در آثار دانشگاهی و نوشتههای عمومی او تشکیل شده است که ریاست آن به عهده دیوید کوتز، معاون پیشین دانشگاه و استاد علوم رایانه، است.البته شنل خود بعدتر گفت از این پس باید استفاده از هوش مصنوعی را در نوشتههای عمومی خود صریحتر اعلام کند و بابت اینکه این رویه را همیشه رعایت نکرده است، عذرخواهی کرد.
عدد آشکارساز هنوز جای داوری استاد را نگرفته است
تناقض دارتموث دقیقاً همینجاست: دانشگاه از ابزاری استفاده میکند که ارزیابی دانشگاه شیکاگو عملکرد بسیار بالایی برای آن گزارش کرده، اما همزمان تأکید دارد نتیجه آشکارساز بهتنهایی کافی نیست.پیشتر نیز پژوهش استنفورد در سال ۲۰۲۳ درباره نسل اولیه آشکارسازها نشان داد این ابزارها میتوانند متون انگلیسی نویسندگان غیرانگلیسیزبان را بهاشتباه ماشینی تشخیص دهند؛ چنانکه در یکی از موردهای مطالعاتی میانگین مثبت کاذب در مقالههای آزمون تافل ۶۱.۳ درصد بود و یکی از آشکارسازها ۹۷.۸ درصد آنها را علامت زد.پانگرام در آن مطالعه آزمایش نشده بود. بنابراین باید گفت بهتر است مسئله دانشگاهها متن تولیدشده با هوش مصنوعی نباشد؛ بلکه تشخیص میزان و نقش ماشین در فرایند نوشتن باشد.
انتهای پیام//
نظر شما